Day 1 提到,我們希望透過攝影機觀察使用者進行居家復健時的動作,並利用 MediaPipe Pose Landmarker 取得人體的關鍵點。
其實對電腦來說,它一開始看到的只是一張張影像,並不會像我們一樣直接知道「這是手肘」、「這是膝蓋」,更不會知道現在這個人的身體有沒有歪掉。
因此,我們需要先進行「人體姿態估測」。
MediaPipe Pose Landmarker 可以從影像中找出人體的33個關鍵點,這些點分布在身體不同的位置,例如:
除了知道關鍵點的位置之外,每個關鍵點還會包含 x、y、z 等座標資訊。
如果把這些關鍵點依照人體結構連接起來,就會形成我們常看到的「人體骨架」。
不過,把骨架畫出來還不代表系統真的看得懂動作。
例如做一個抬腿動作時,系統目前可能只知道:
「膝蓋的位置改變了。」
但我們真正希望它未來可以判斷的是:
「腿抬到的角度夠不夠?」
「身體有沒有跟著往旁邊傾斜?」
「左右兩側是不是出現明顯的不對稱?」
所以接下來不能只看單一關鍵點的位置,而是要進一步利用不同關鍵點之間的關係,例如肩膀與髖部的位置、髖膝踝形成的角度等,慢慢把一堆座標轉換成可以判斷動作的資訊。
目前這個階段的目標,就是先讓系統穩定地「找到人、找到關節」。